為什麼會想寫這個系列?
過去在實驗室專注於深度學習與模型訓練時,我們往往習慣了高度標準化的資料集。無論是調整演算法還是優化網路架構,重點多半放在「如何提升模型的預測準確率」。
然而,當我們將目光轉向業界的真實商業場景,會發現一個殘酷的事實:感覺美好的乾淨資料只存在於教學範例中。
企業在招募數據分析師(Data Analyst)或資料工程師(Data Engineer)時,往往更看重以下兩點:
處理真實髒數據的工程能力:
1.面對缺漏、格式混亂、散落在不同資料表的數據,能否建立穩定的輕量級 ETL(Extract, Transform, Load)管線?
2.解決問題的商業思維(Business Sense): 能否將冷冰冰的數據,轉化為諸如留存率、客單價、顧客分群等能幫助企業獲利的商業洞察?
為了補足從「學術研究」走向「業界實戰」的這塊拼圖,我決定展開這 30 天的挑戰。不碰艱澀的機器學習演算法,而是專注於打好數據處理的底盤!
我選用的是Olist 巴西電商資料集
為了模擬最真實的業務場景,這次挑戰我選用了 Kaggle 上的 Brazilian E-Commerce Public Dataset by Olist。
為什麼選擇它?
因為它不是一張單純的平面 Excel 表格,而是由 9 張關聯表(Relational Tables) 所組成的真實資料庫倒出檔。包含:
📦 訂單明細與物流狀態
👤 客戶位置資訊
💳 支付方式與金額
📝 真實的顧客評論與評分
要分析這份數據,我們必須頻繁使用 Merge 與 Join 跨表關聯,處理時間戳記的運算,甚至面對因物流延遲而產生的異常數據——這正是業界每天都在發生的日常。
這 30 天的實戰藍圖
接下來的 29 天,我將使用 Python (Pandas) 作為主力,在熟悉的 VS Code 開發環境中,帶大家走過一個端到端的資料分析專案。預計的路線圖如下:
Phase 1:環境建置與資料萃取 (Extract)
解析 9 張資料表的 ER Diagram(實體關聯圖)。
建立資料分析的 Python 虛擬環境,讀取海量資料的初探。
Phase 2:資料清洗與轉換 (Transform)
跨表合併的藝術: 組裝商業分析用的「寬表」。
髒數據急救: 處理遺失值、異常的時間戳記與字串正規化。
特徵工程: 從原始訂單中萃取出「物流延遲天數」等關鍵衍生欄位。
Phase 3:商業洞察實戰 (Insights)
實作業界核心指標:月營收成長率(MoM)、客單價(AOV)。
建構 RFM 顧客分群模型。
繪製 Cohort Analysis留存率熱力圖。
Phase 4:資料儲存與總結 (Load)
將清洗完的數據寫入 SQLite 輕量級資料庫。
這 30 天不僅是對自己 Python 數據處理能力的展示,也是一份公開的面試筆記。
如果你也想知道如何把雜亂無章的原始數據,一步步轉化為具備商業價值的分析洞察,
歡迎按下追蹤,跟著我一起用 30 天破關!
明天,我們將正式下載資料,並拆解這 9 張表的關聯架構。我們 Day 2 見!